Anthropic의 최신 AI 발견이 밝히는 것과 한계
Anthropic은 대형 언어 모델(LLM)의 수많은 계산 과정을 들여다보고 결과의 원인을 파악하는 '기계적 해석 가능성(Mechanistic interpretability)' 연구를 심화시키고 있습니다. 최근 연구를 통해 회사는 모델이 문제를 풀 때 사용하지만 겉으로 드러나지 않는 내부 개념 공간인 'J-스페이스(J-space)'를 발견했습니다. 하지만 AI 모델을 심리학적 용어로 해석하는 것은 그 복잡한 수학적 구조를 지나치게 신비화할 수 있다는 비판적 시각도 존재합니다.